Learning Transferable Visual Models From Natural Language Supervision (2021 论文)
概述
提出 CLIP 模型的论文,通过对比语言-图像预训练实现零样本视觉理解。
关键内容
- 对比学习:训练图像和文本编码器,使匹配的图文对在嵌入空间中靠近,不匹配的远离。
- 零样本迁移:CLIP 可以在未见过的类别上进行零样本分类,只需提供类别名称的文本描述。
- 多模态对齐:建立了文本和视觉的统一表示空间,为 DALL-E 等文生图模型奠定基础。
来源
- ai_papers_timeline.md — 2021 年时间线条目
相关
- Alec Radford — authored_by
- CLIP — introduced
- 零样本学习 — demonstrated
- DALL-E — relates_to